TD
The Decoder • 27일 전
IMP 7
최고 성적을 받는 역량일수록 AI가 가장 잘 위조한다
이탈리아 보코니 대학 신입생 1,000여 명 대상 무작위 실험에서 GPT-4o 사용 학생들이 과제 점수를 크게 높였지만, 실제 학습이 개선됐는지는 검증되지 않았습니다. 현재 채점 기준이 완성도와 구조를 중시해 AI를 활용한 부정행위에 취약하다는 점이 핵심 문제로 지적됩니다.
교육 GPT-4o AI 부정행위
이탈리아 보코니 대학 신입생 1,000여 명 대상 무작위 실험에서 GPT-4o 사용 학생들이 과제 점수를 크게 높였지만, 실제 학습이 개선됐는지는 검증되지 않았습니다. 현재 채점 기준이 완성도와 구조를 중시해 AI를 활용한 부정행위에 취약하다는 점이 핵심 문제로 지적됩니다.
미국 브라운대학교 교수가 AI 사용을 금지하고 대면 감독 시험을 실시한 결과, 학생들의 평균 점수가 96점에서 48점으로 급락했습니다. 이는 학생들이 과제와 비대면 시험에 AI를 광범위하게 무단 사용하고 있었음을 시사하며, 두 개의 대규모 연구도 '높은 과제 점수와 낮은 실제 시험 점수'라는 동일한 패턴을 확인했습니다. 이는 교육 현장에서 평가 방식의 근본적인 재정비와 AI 사용에 대한 엄격한 가이드라인이 필요함을 보여줍니다.